作者:robot 发表时间:2026-08-11 10:55:32 转载自:机器之心
"The dexterity of a hand is mostly about the brain, not the hand."
这是 “全球机器人灵巧操作之父” Matthew Mason 写在个人主页上的一句话:灵巧操作在于脑,而不在手。

Matthew Mason 为卡内基梅隆大学教授,他开创了研究机器人操作领域的研究,门下学生遍布全球机器人研究机构与行业巨头。图片来源:www.ri.cmu.edu
这句话正好解释了今天具身智能的关键问题:机器人正在拥有越来越复杂的手,但当机器人真正进入现实世界,这双灵巧手却并不等于真正的灵巧操作。
问题或许从来都不只在 “手” 上。具身真正缺乏的,是一个懂物理、懂交互、能够驱动这双手的 “脑”。
8 月 10 日,戴盟机器人正式发布全球首个触觉锚定世界模型 Daimon-TWM(Tactile-grounded World Model),以原生触觉贯穿物理认知、推演决策和瞬时反应全阶段。这个 “物理交互脑” 不仅能理解正在发生的物理接触,还能预测下一步交互会发生什么,并根据瞬息万变的反馈及时修正动作。
在多类高难度的接触密集型任务中,Daimon-TWM 平均成功率达到 64.0%,位姿调整类别任务成功率稳定在 80% 以上;在扰动环境中,Daimon-TWM 的操作成功率更是高出 π0.5 十倍。换句话说,这个新模型不仅把标准动作做得漂亮,而且当现实世界开始 “不按剧本运行” 时,它更能随机应变。
模型惊艳能力的背后,是一支全球顶配触觉研究军团 —— 戴盟机器人。
这家成立于 2023 年的具身智能公司,以让机器人具备在真实世界中的灵巧操作能力为终极目标。创始人兼首席科学家王煜正是机器人灵巧操作之父 Matthew Mason 的首位博士生,深耕机器人操作领域 40 年,同时也是香港科技大学机器人研究院创院院长。另一位创始人兼 CEO 段江哗则是王煜的学生,从十年前已经深入机器人操作研究。
如何做出一个能够驱动灵巧操作的模型?他们给出的答案是:让触觉真正成为这个 “物理交互脑” 的入口。
都知道触觉重要,为什么机器人还是 “摸” 不懂?
触觉是机器人操作能力的关键 —— 这在今年已经成为行业共识。例如不久前李飞飞署名的论文 T-Rex,证明了触觉可以提高机器人的操作能力。
这里的逻辑其实不难理解。拿起一个纸杯时,眼睛可以告诉我们杯子在哪里、是什么形状,却无法直接告诉我们该用多大的力。视觉负责看见世界,触觉才负责与世界进行交互:杯壁是否发生形变,杯子有没有滑动,手指施加的力量是否足够,继续用力会不会把杯子捏扁…… 任何与物理世界的真实交互,最后一厘米都要交给触觉。
那为什么触觉仍未大规模应用到具身模型?因为 “手感” 是出了名的说不清。
当我们描述拿起一个杯子的手感时,需要涉及软硬、摩擦、形变、滑移等多个维度。拿软硬来说,“软” 和 “硬” 只是两个极端,真实世界更多是 “很软”“偏软”“较硬” 这种连续的程度区分 —— 这种细微差异难以用语言描述,照片也拍不出来,却直接决定操作的成功率。

视觉相似的物品,模型必须学会通过触觉判别其物理属性
因此,戴盟首先解决的并不是 “让机器人怎么动”,而是让机器人真正读懂触觉。
Daimon-TWM 学习了覆盖上万种物体、跨不同材质的 1000 多万组物理交互数据,将原始触觉中的受力、形变、摩擦等复杂变化转化为模型可理解的统一物理语义。
更重要的是,它不满足于让模型 “猜答案”,而是训练模型依据触觉完成 “感知 — 比较 — 结论” 的推理过程。这种能力在视觉与触觉发生冲突时尤其重要 —— 视觉可能把橡胶判定为塑料、可能把带图案的光滑表面判定为粗糙纹理,只有真正懂触觉的模型,才能准确判断物理属性与物理状态,从而规划下一步的操作。


Daimon-TWM 能够根据触觉推理物体的物理属性(滑动查看更多)
换句话说,机器人获得的不再只是简单的触觉模态输入,而是一套关于物理世界的常识。效果直接反映在成绩单上:Daimon-TWM 在物理认知九项核心指标全部第一,综合得分达到 60.1 分,不仅领先触觉专用模型 SToLa 12.6 分,更领先 GPT-4o 24.7 分。

Daimon-TWM 在物理认知多项核心指标上均取得最优成绩
这也揭示了一个容易被忽视的问题:通用大模型读过海量文字、看过无数图片,却从未真正 “摸” 过一个物体 —— 但真实的物理智能,最终还要从一次次接触中生长出来。
从预测下一帧画面,到预测下一刻交互
如果说物理常识是地基,那 Daimon-TWM 真正的杀手锏,是预测。
在李飞飞的 T-Rex 中,触觉可以在接触发生后帮助模型及时纠偏。然而,现实世界的物理交互没有 Ctrl+Z,齿轮怼歪了、杯壁捏裂了,就再也回不去了。真正灵巧的机器人不能等错误发生之后再纠正,而是应该在交互的动态过程中提前看到风险,通过预测进行最优规划。
这正是 Daimon-TWM 更进一步的地方。当全行业都在用世界模型预测下一帧画面时,戴盟把世界模型的能力迁移到了触觉:交互还未发生,模型已经提早一步推演出未来的动态变化。

双齿轮装配任务中,预测触觉信号(上)与实测触觉信号(下)高度相似;图片来源:参考技术报告 [2]
通过统一触觉表征、触觉思维链(T-CoT)以及由粗到细的未来触觉预测机制,Daimon-TWM 能够围绕接触阶段、接触状态和潜在失败风险进行推演。更精妙的是,Daimon-TWM 并不是让机器人永远盯着触觉,而是当机器人真正碰到物体、接触变得密集时才调整各表征的权重,让触觉成为判断下一步动作的关键证据。
在结果对比里,模型预测的触觉变化与实际测量值几乎完全重合。凭借 “未卜先知” 的能力,Daimon-TWM 完成了双齿轮装配这一高难度任务 —— 不仅要依次插上两个大小不同的齿轮,还要让齿牙严丝合缝地咬合。对纯视觉模型来说,这几乎是不可能完成的任务。

想得更远,也要反应够快
现实中的物理交互可能会遇到各种扰动,变化往往发生得非常快,模型除了预判能力,还必须能在瞬间接收反馈,及时调整动作。
为此,Daimon-TWM 采用了 “慢规划、快纠偏” 的分层机制:上层负责理解任务,并预判给出整体策略;底层的触觉 - 动作控制器则以 100Hz 高频伺服,根据实时触觉反馈对动作进行毫秒级修正。

Daimon-TWM 模型架构图
三大模块协同互作,形成了从指尖感知到大脑推理,再返回脊髓控制的 “触觉神经系统”,由此形成完整闭环:
理解当前接触 → 预测未来变化 → 规划下一步动作 → 实时感知结果 → 高频修正动作。
戴盟公布的消融实验证明了这是一套系统性优势,去掉任何一项都会导致成功率下滑。随模型发布的接触密集型操作 demo,更把这套能力翻译成了肉眼可见的画面。

消融实验:以 USB 插拔成功率验证 Daimon-TWM 的系统性优势
比如 USB 插入时,视觉负责寻找大致位置,但真正插入时,必须依靠触觉判断是否对齐。如果一侧受力突然增强,意味着 USB 可能已经偏斜,模型必须立即抬起、调整角度,而不是 “硬怼”;插到底后,模型感觉到 USB 与接口的接触,必须及时停下,避免损坏接口。整个过程中包含 “找到 - 插入 - 停止”,每一步都依赖触觉赋予的认知、预判和瞬时反应能力。

插入 USB 时,模型能够根据实时触觉反馈调整位置和用力
擦拭花瓶同样如此:海绵既要始终贴住凹凸的曲面,又不能施加过大的力;当花瓶位置突然改变,原本规划好的轨迹立即失效,Daimon-TWM 必须一边预测接触状态的变化,一边通过高频控制持续修正动作,才能稳稳跟住不断变化的花瓶完成作业。

随机人为扰动,改变花瓶位置,模型根据顺势反馈和预测规划能力,迅速调整擦拭轨迹
这也解释了开头那组数据里最重要的部分:在接触密集型操作任务中,无扰动条件下,Daimon-TWM 的 64% 对 π0.5 的 26% 已经足够引人注目;但有干扰时的 53% 对 6% 才是真正的分水岭。真正拉开差距的,不是机器人能不能把标准动作做出来,而是在永远有意外情况的真实世界中,模型能不能随机应变。

在调整(铅笔、试管)、擦拭(黑板、花瓶)、插入(USB、插头)、齿轮装配等多项任务中,Daimon-TWM 与 π0.5 成功率对比(cln:无扰动;ptb:有扰动)
边做、边判断、边恢复,这才是机器人走向真实世界的关键。
真正的物理智能,拼的不止是模型
Daimon-TWM 的能力并非仅仅来自模型结构,而是诞生于戴盟长期构建的 Physical AI Infra。
从触觉传感器,到数据采集网络、数据处理管线,再到物理交互能力评测基准,戴盟构建了一套可持续生产高质量真实交互经验的物理智能基础设施。
其中,自研多维高分辨率高频率视触觉传感器,可完整获取切向力、法向力、摩擦、滑移、纹理等多项触觉模态,提供高质量全模态的触觉数据;超百万小时规模的含触觉多模态物理世界数据集 Daimon-Infinity,则为模型提供了源源不断的训练燃料。今年 4 月,戴盟已于阿里魔搭社区开源部分数据,目前获得超 440 万次下载,位列魔搭社区物理世界数据集第一名。

魔搭社区主页截图
链接:https://modelscope.cn/datasets/daimonrobotics/Daimon-Infinity
这套基础能力,源于戴盟贯穿学术研究与产业落地的 “触觉操作基因”:
戴盟创始人兼首席科学家王煜,身为全球机器人操作领域权威,在斯坦福大学发布的 “终身科学影响力排行榜” 和 “年度科学影响力排行榜” 中均位列全球前 1%。在今年 6 月的国际机器人与自动化会议(ICRA)大会上,王煜发表发表《Touch Physical AI》主题演讲,提出以触觉驱动具身模型的物理交互能力,获得行业广泛认可。
另一位创始人兼 CEO 段江哗,作为国内最早一批机器人操作研究人员,长期活跃于科研、创业与产业实践一线。主导模型研究的首席 AI 科学家原玮浩,长期研究具身智能与多模态大模型,曾任阿里通义实验室多模态大模型研究专家,拥有丰富的大模型经验,在 NeurIPS、ICLR、CVPR、ICRA 等人工智能顶级会议发表论文 40 余篇,包括多篇 Oral 和 Highlight。
给机器人装上 “物理交互脑”
回到 Mason 的那句话:“The dexterity of a hand is mostly about the brain, not the hand.”
Daimon-TWM 真正值得关注的,不只是某几项任务成功率的提高,而是它以触觉锚定,全方位提升机器人的认知、预测、决策和控制能力。
从 “看见再行动”,到 “接触后反应”,再到 “预测接触、主动调整”,机器人正在从执行预设动作,走向真正意义上的物理交互。
语言模型的奇迹,来自互联网上的万亿文本;而物理智能的奇迹,或许将来自每一次真实的触碰。
当机器人具备真正懂得物理交互的 “物理交互脑”,具身智能的 ChatGPT 时刻,可能比我们想象的更近。
相关技术报告:
https://arxiv.org/pdf/2605.27154
https://arxiv.org/pdf/2606.31723
2026年全球轮式双臂机器人技术演进与商业化深度研究报告
习近平出席2026世界人工智能大会暨人工智能全球治理高级别会议开幕式并发表主旨讲话
2026年中国具身智能产业商业化前沿洞察
智汇数字新机遇 共绘友好新图景——2026全球数字经济大会在京盛大开幕
清华火神队成功卫冕RoboCup 2026世界冠军,加速进化构筑全球具身智能“通用底座”
持续加大研发投入、推进技术创新 滴滴自动驾驶发力